알리바바, 2.4조 매개변수 Qwen3.8-Max 공개
알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 MoE(Mixture of Experts) 모델인 Qwen3.8-Max를 정식 출시했습니다. 이 모델은 텍스트, 이미지, 비디오 입력을 지원하며 최대 100만 토큰의 컨텍스트를 처리할 수 있고, 다음 주에 오픈 웨이트(Open Weights) 공개를 예고하여 AI 업계의 높은 관심을 끌고 있습니다.
알리바바의 Qwen 팀이 2.4조 개의 매개변수를 가진 MoE(Mixture of Experts) 모델인 Qwen3.8-Max를 정식 출시했습니다. 이 모델은 텍스트, 이미지, 비디오 입력을 지원하며 최대 100만 토큰의 컨텍스트를 처리할 수 있고, 다음 주에 오픈 웨이트(Open Weights) 공개를 예고하여 AI 업계의 높은 관심을 끌고 있습니다.
독일 연구소와 스타트업 컨소시엄이 유럽의 기술 주권을 확보하기 위해 개발한 300억 매개변수(30B) 규모의 오픈소스 기반 모델 'Soofi S'를 공개했습니다. 독일어와 영어에 최적화된 이 모델은 데이터 투명성과 통제력이 핵심적인 유럽 산업계의 요구를 충족하기 위해 설계되었습니다. 현재는 실증 테스트 참여 기업을 모집 중이며, 향후 대화 및 추론 특화 모델 등으로 확장될 예정입니다.
프라임 인텔렉트(Prime Intellect)가 에이전트 기반 강화학습 작업을 통해 1조 개 매개변수 규모의 MoE(Mixture-of-Experts) 모델을 비동기식으로 훈련할 수 있는 오픈소스 프레임워크 'prime-rl 0.6.0'을 발표했습니다. 이 프레임워크는 소프트웨어 엔지니어링(SWE) 작업을 수행하는 GLM-5 모델을 훈련하며 5분 미만의 짧은 스텝 시간을 기록하여, 대규모 모델 훈련의 효율성을 크게 높였다는 점에서 AI 실무자들에게 매우 중요합니다.
제트브레인이 AI 개발 워크플로우 최적화를 위해 120억(12B) 매개변수의 MoE 아키텍처 기반 'Mellum2' 모델을 아파치 2.0(Apache 2.0) 라이선스로 공개했습니다. 이 모델은 10.6조 개의 토큰으로 학습되어 복잡한 멀티 모델 파이프라인 내에서도 빠르고 특화된 작업 처리에 강점을 지닙니다. 이는 실무자들이 자체 개발 환경에 고품질 코딩 AI를 자유롭게 통합할 수 있다는 점에서 중요한 의미를 갖습니다.
StepFun이 1980억 개의 파라미터를 갖춘 MoE(Mixture of Experts) 기반의 시각-언어 모델인 Step 3.7 Flash를 발표했습니다. 이 모델은 코딩 에이전트 및 검색 워크플로우에 최적화되었으며, 256K 컨텍스트와 네이티브 비전(Native Vision), 그리고 어드바이저 모드(Advisor Mode)를 지원하는 것이 특징입니다.
한 변호사가 V100 12개와 RTX 3090 등 총 16개의 GPU를 활용해 법률 문서 초안을 자동 작성하는 로컬 AI 시스템을 완성했습니다. 실험 결과 V100 환경에서는 일반적인 Dense 모델보다 MoE(Mixture of Experts) 모델이 압도적인 처리 속도를 보여주어 시스템 전체를 MoE 중심으로 재구성했습니다. 여러 로컬 모델이 각자의 역할을 나누어 수행하는 오케스트레이터 구조를 통해 고수준의 법률 문서를 빠르고 정확하게 생성해 내는 것이 이 프로젝트의 핵심입니다.